вернуться в раздел "Научные труды"

Humanities & Social Sciences Communications

СТАТЬЯ


Культурные регионы Америки, картированные посредством лексического анализа социальных медиа

Томас Луф® 1, Бруно Гонсалвес2, Хосе Х. Рамаско® 1, Давид Санчес® 1 & Джек Грив3,4

1Институт междисциплинарной физики и сложных систем IFISC (UIB-CSIC), Пальма-де-Мальорка, Испания. 2Фонд ISI, Турин, Италия. 3Факультет английского языка и лингвистики, Бирмингемский университет, Бирмингем, Великобритания. 4Институт Алана Тьюринга, Лондон, Великобритания. 5Email: thomaslouf@ifisc.uib-csic.es; david.sanchez@uib.es

Культурные ареалы представляют собой полезную концепцию, обогащающую различные области социальных наук. Знание о том, как люди организуют и соотносят свои идеи и поведение в обществе, может помочь нам понять наши действия и отношение к различным вопросам. Однако выбор общих черт, формирующих культурный ареал, в некоторой степени произволен. Необходим метод, способный использовать огромные массивы данных, поступающих в онлайн, особенно через социальные сети, для выявления культурных регионов без ad-hoc допущений, предубеждений или предрассудков. Данная работа делает важный шаг в этом направлении, представляя метод вывода культурных регионов на основе автоматического анализа больших наборов данных из микроблоговых сообщений. Представленный здесь подход основан на принципе, что культурную принадлежность можно вывести из тем, которые люди обсуждают между собой. В частности, измеряются региональные вариации в письменном дискурсе в американских социальных сетях. Из распределений частотности знаменательных слов в геотегированных твитах находятся региональные "горячие точки" использования слов, а затем выводятся главные компоненты региональной вариации. Посредством иерархической кластеризации данных в этом пространстве меньшей размерности этот метод выявляет чёткие культурные ареалы и темы обсуждения, которые их определяют. Он обнаруживает явное разделение Север-Юг, на которое в первую очередь влияет афроамериканская культура, а также дальнейшие смежные (Восток-Запад) и несмежные разделения, которые дают всестороннюю картину современных культурных ареалов Америки.

Введение

Культурная идентичность — неуловимое понятие, поскольку зависит от широкого спектра различных культурных факторов — включая политику, религию, этническую принадлежность, экономику, искусство и множество других примеров — которые, как правило, различаются у разных индивидов, причём культурный фон каждого человека в конечном итоге уникален. Тем не менее, от людей из одного региона, как правило, можно ожидать наличия некоторых общих культурных черт, отражающих разделяемые культурные ценности и практики, связанные с регионом (Brock et al., 1973). Выявление культурных регионов нации — регионов, население которых характеризуется относительной культурной однородностью по сравнению с населением других регионов внутри нации — представляет собой очень ценную информацию для широкого круга областей. Например, правительствам важно понимать географические различия в ценностях своего населения, чтобы лучше удовлетворять их образовательные, социальные и социально-бытовые потребности. Аналогично, с экономической точки зрения, важно определить, где наиболее востребованы те или иные услуги и продукты, и как лучше всего взаимодействовать с населением в разных регионах страны. В целом, определение культурных регионов нации является, таким образом, важной частью понимания сложной картины человеческого поведения, которую охватывает нация, обеспечивая доступную и широкую классификацию населения страны (Lane and Ereson, 2016).

Картирование культурных регионов было особенно активной областью исследований в США, где давно ведутся дебаты о культурной географии страны, и был предложен широкий спектр теорий американских культурных регионов. Семь наиболее заметных теорий (Elazar, 1970; Garreau, 1996; Gastil, 1975; Lieske, 1993; Odum, 1936; Woodard, 2012; Zelinsky, 1973) отображены на рис. 1, показывая существенные расхождения. Например, были выделены пять основных культурных регионов — Новая Англия, Мидленд, Юг, Средний Запад и Запад (Zelinsky, 1973) — на основе синтеза региональных паттернов широкого спектра культурных факторов, включая этническую принадлежность, религию, экономику и историю заселения. Альтернативное предложение (Gastil, 1975), опирающееся на схожий, но более обширный круг культурных факторов, выделило 13 основных культурных регионов, предлагая более сложную теорию, чем у Зелинского, в том числе за счёт разделения регионов Мидленд, Средний Запад и Запад у Зелинского. Эти два исследования иллюстрируют два основных ограничения такого типа подходов, которые субъективно синтезируют ряд данных для вывода культурных регионов. Во-первых, неясно, как именно следует определять релевантные культурные факторы. Зелинский рассматривает меньше факторов, чем Гастил, что может объяснять его более простое предложение. Во-вторых, неясно, как следует синтезировать эти различные факторы для создания единой общей карты культурных регионов. Зелинский уделяет больше внимания важности первоначального заселения, что также может объяснять его более простое предложение.

Учитывая субъективность, лежащую в основе этих исследований, отсутствие согласия относительно количества и местоположения американских культурных регионов (как показано на рис. 1) неудивительно. Только различие между Севером и Югом, отражающее границу между Союзом и Конфедерацией, и различие между Востоком и Западом, отражающее путь Скалистых гор, являются общими для этих наиболее влиятельных теорий американских культурных регионов (Elazar, 1970; Fischer, 1989; Garreau, 1996; Gastil, 1975; Lieske, 1993; Odum, 1936; Woodard, 2012; Zelinsky, 1973). В остальном же было нанесено на карту от 4 до 12 первичных культурных ареалов, обычно включающих Северо-Восток (Elazar, 1970; Fischer, 1989; Garreau, 1996; Gastil, 1975; Lieske, 1993; Odum, 1936; Zelinsky, 1973), Юг (Elazar, 1970; Fischer, 1989; Garreau, 1996; Gastil, 1975; Lieske, 1993; Odum, 1936; Woodard, 2012; Zelinsky, 1973), Запад (Elazar, 1970; Garreau, 1996; Gastil, 1975; Odum, 1936; Woodard, 2012; Zelinsky, 1973) и Средний Запад (Elazar, 1970; Garreau, 1996; Gastil, 1975; Odum, 1936; Zelinsky, 1973).

По большей части дебаты о географии американских культурных регионов касались того, каким типам культурных факторов следует отдавать приоритет и как эти факторы следует сочетать. Что особенно важно, эти решения, как правило, полностью оставлялись на усмотрение аналитика. Количественные данные переписей и выборов иногда принимались во внимание (например, Gastil, 1975; Lieske, 1993; Woodard, 2012; Zelinsky, 1973), но реже подвергались статистическому анализу (например, Lieske, 1993), в то время как выбор и взвешивание этих факторов всегда были субъективными. Например, религия и политика, несомненно, являются важными культурными факторами, но их можно измерять различными способами, и неясно, насколько они важны относительно друг друга и варьируется ли их важность по территории США.

Таким образом, основной вопрос заключается в том, как мы можем вывести общие американские культурные регионы объективным способом? В частности, как мы можем как определить полный или, по крайней мере, репрезентативный спектр релевантных культурных факторов, так и каким-то образом объединить эти факторы, чтобы картировать американские культурные регионы? Определение таких регионов не означает, что они не содержат внутренних вариаций или что они разделены жёсткими границами — культура динамична и сложна, а люди очень мобильны — но означает, что мы можем найти области, где культурные практики и ценности людей, живущих в этом регионе, более схожи друг с другом, чем с таковыми у людей, живущих вне этого региона.

Таким образом, цели данной статьи — решить эти проблемы, (i) предложив новый метод обнаружения культурных регионов путём выявления региональных паттернов в темах разговоров, а затем (ii) предложив теорию американских культурных регионов, выведенную из применения этого метода к большому корпусу геолокационных данных из социальных сетей.

Наша исходная предпосылка заключается в том, что культурные регионы обязательно будут отражаться в региональных вариациях тем, которые люди выбирают для обсуждения в повседневной жизни. Если бы культурная география США была в целом гомогенной, мы ожидали бы, что темы разговоров в основном будут одинаковыми по всей стране, за исключением различного употребления топонимов и других подобных относительно поверхностных и неизбежно региональных лексических единиц. Однако, если люди из разных регионов проявляют различные и систематические культурные характеристики — например, в политике, религии, музыке, спорте и моде — как последовательно показывают исследования по культурной географии Америки, то эти паттерны культурной вариации обязательно будут проявляться как паттерны тематической вариации в языке, используемом людьми из этих регионов (Kramsch, 2014). Например, если хип-хоп музыка, бейсбол, татуировки или какая-то другая культурная практика особенно популярны в некоторых частях страны, мы ожидали бы больше обсуждений на эту тему в больших выборках повседневного языкового использования, происходящих из этого региона, включая социальные сети. Более того, культурные характеристики часто имеют региональную структуру и взаимосвязаны. Например, региональные паттерны в этнической принадлежности и религии часто отражают модели заселения, что, в свою очередь, может помочь объяснить региональные паттерны в политике. Следовательно, анализ этих региональных тематических паттернов в совокупности может быть использован для вывода широких культурных регионов.

Ключевой момент: нет необходимости заранее определять, что представляют собой эти тематические паттерны или насколько они важны: сами темы и их относительная важность также могут быть выведены посредством анализа повседневного языка. Поэтому мы представляем автоматизированный метод идентификации культурных регионов, основанный на автоматическом выявлении паттернов региональной вариации в темах обсуждения в очень больших корпусах геотегированного повседневного языкового использования. Наш метод специально предназначен для использования невероятно большого количества геотегированных данных из социальных сетей, которые онлайн-коммуникация теперь впервые предоставляет нам, хотя наш метод может быть использован для идентификации культурных регионов в любой области на основе любого существенного источника регионального повседневного языкового использования.

В частности, для картирования современных американских культурных регионов мы выявляем региональные паттерны в темах, которые американцы склонны обсуждать в социальных сетях, посредством количественного анализ 10 000 лексических единиц в более чем 3,3 миллиардах геотегированных твитов со всей территории США, собранных в период с 2015 по 2021 год. Большие корпуса геотегированных данных Twitter часто использовались в вычислительной социолингвистике (Nguyen et al., 2016) для картирования паттернов диалектной вариации (Abitbol et al., 2018; Donoso and Sánchez, 2017; Eisenstein et al., 2014; Goncalves et al., 2018; Goncalves and Sánchez, 2014; Grieve, 2016; Grieve et al., 2019, 2011; Huang et al., 2016), в то время как другие использовали такие методы, как латентное размещение Дирихле, для выявления региональных тематических паттернов (Funkner et al., 2021; Koylu, 2018). Несмотря на это обилие исследований, использовавших большие корпуса данных из социальных сетей для выявления региональных паттернов в языковом использовании, нам не известно ни одного исследования, которое использовало бы этот тип информации для вывода местоположения общих культурных регионов.

Конечно, социальные сети или любая другая форма языка могут дать лишь частичную картину региональных паттернов в общих темах обсуждения в регионе. В целом, большие наборы данных, сгенерированные на платформах микроблогов, безусловно, представляют ряд смещений: неполная демографическая репрезентативность (Mislove et al., 2011), особенно для пользователей, добавляющих геотеги к своим твитам (Pavalanathan and Eisenstein, 2015), неоднородное пространственно-временное распределение (Steiger et al., 2015) или серьёзные тематические различия с офлайн-миром (Diaz et al., 2016). Однако, если культурные регионы реальны и повсеместны, то мы должны ожидать, что эти регионы проявят себя в любой большой выборке повседневного языка, охватывающей большую часть населения, даже если конкретные интересующие темы варьируются в этих различных доменах. Более того, в настоящее время Twitter — это единственный источник разнообразных геотегированных данных естественного языка, доступный в достаточных количествах для проведения надёжного автоматического анализа, и это очень популярная платформа социальных сетей, регулярно используемая миллионами людей со всей территории США, в основном в интерактивных контекстах (Auxier and Anderson, 2021), что делает её идеальным доменом для применения нашего управляемого данными подхода к автоматическому картированию культурных регионов.

Наше основное открытие заключается в том, что современные США могут быть разделены на пять основных культурных ареалов, каждый из которых определяется собственными тематическими паттернами. Мы подчёркиваем, что этот результат вытекает из количественного анализа, в отличие от предыдущих предложений, основанных на более или менее информированных (качественных) подходах. Более того, помимо конкретного количества регионов наиболее важно отметить, что наш метод даёт список слов и тем, которые определяют эти регионы, что подчёркивает различия в интересах, привычках и происхождении, которые отличают каждый культурный регион от других. Ключевым моментом является то, что посредством динамического анализа мы показываем, что культурные регионы США относительно стабильны за последние несколько лет, что предоставляет дополнительные доказательства того, что культурные ареалы являются реальными явлениями, пронизывающими американское общество.

Остальная часть статьи структурирована следующим образом. Сначала представлены результаты работы с описанием методологии сбора данных и предварительной обработки. Затем исследуются региональные вариации использования слов, наблюдаемые в этом наборе данных, прежде чем получить главные измерения этих вариаций. Затем подробно представлен основной результат работы — культурные регионы США и основные темы обсуждения, которые их определяют. Затем исследуется возможность изменения результатов со временем. Наконец, обсуждение инсайтов, привнесённых анализом, а также того, на чём будущие работы могут на нём строиться, завершает работу.

Результаты

Набор данных. Мы анализируем геотегированные твиты, собранные через потоковый API Twitter, точнее, используя конечную точку фильтрованного потока: https://developer.twitter.com/en/docs/twitter-api/tweets/filtered-stream. Эта конечная точка предоставляет выборку твитов в реальном времени, соответствующих подходящим фильтрам. Это позволило нам собрать 3,3 миллиарда геотегированных твитов с континентальной части США, опубликованных с 1 января 2015 года по 31 декабря 2021 года. Важно отметить, что мы отбрасываем пользователей, публикующих твиты с нечеловеческой скоростью, которую мы определяем как любую скорость, превышающую 10 твитов в час за весь период их твиттинга. Мы также отбрасываем пользователей, твитящих с любой платформы, не являющейся мобильным приложением Twitter или их веб-сайтом. Таким образом, в нашем наборе данных мы сохраняем 17 миллионов пользователей. Мы очищаем твиты от ссылок, хэштегов или упоминаний пользователей и оставляем только те, в которых после этой фильтрации остаётся более 4 слов. Хэштеги были отброшены из предосторожности: некоторые из них могут быть знаменательными словами, но они также могут быть связаны, например, с краткосрочными трендами. Поскольку мы обнаружили, что содержание хэштегов составляло менее 5% от содержания собранных нами твитов, их в любом случае можно безопасно отбросить. Затем мы используем Chromium Compact Language Detector (CLD) (Al-Rfou and Solomon, 2014) для удаления твитов, написанных на любом другом языке, кроме английского. Для привязки геолокации твиты геотегируются либо точными GPS-координатами устройства пользователя, либо «местами», которыми могут быть административный регион, город или достопримечательность. Затем, поскольку эти геотеги могут быть местами размером со штат, мы также удаляем твиты с геотегом, который не позволял надёжно отнести их к нашим единицам площади, которыми являются округа США и их эквиваленты (всего 3108). Безусловно, округа различаются как по размеру, так и по населению, но большинство из них образуют полезное деление, достаточно крупное, чтобы показать значительное количество твитов, и достаточно мелкое, чтобы позволить тщательное разграничение культурных ареалов (штаты были бы слишком крупными единицами, тогда как города — слишком мелкими).

Из оставшихся твитов мы извлекаем и подсчитываем токены в их тексте и присваиваем их округам. Округа, накапливающие менее 50 000 токенов, не учитываются, в результате чего у нас остаётся Nc = 2576 округов, которые определяют наши подкорпуса. Таким образом, мы сохраняем 83% от общего числа округов. После этой фильтрации полный набор данных содержит 9,1 миллиарда токенов (см. сводное описание набора данных в таблице S1). Затем мы преобразуем оставшиеся словоформы в нижний регистр и агрегируем подсчёты токенов по этим формам. Затем мы удаляем все служебные слова (такие как the, and) и междометия (такие как um, oh) (см. раздел "Доступность данных" для доступа к полному списку исключений) и рассматриваем 10 000 наиболее употребительных оставшихся словоформ. Отметим, что этот список словоформ возникает из данных и не навязывается какими-либо предыдущими тематическими или диалектными классификациями.

Измерение региональной вариации. Затем мы измеряем и наносим на карту относительные частоты fc,w для каждого слова w в каждом округе c. Мы иллюстрируем наши сырые результаты, построив на рис. 2 относительную частоту в каждом округе четырёх репрезентативных слов: (a) today, (c) mountain, (e) traffic и (g) bruh (ячейки, выделенные серым, не достигают минимального количества твитов, как объяснено в предыдущем абзаце). В первом случае today появляется с относительно стабильной частотой в большинстве округов, как и ожидалось. С другой стороны, mountain — регионально зависимое слово, что чётко видно. Слово traffic появляется чаще в городских районах. Наконец, bruh — вариант афроамериканского английского, который, по-видимому, особенно распространён в южных округах, где проживает большое афроамериканское население.

Теперь требуется слово предостережения. Одна только карта относительной частоты не способна полностью выявить региональные вариации из-за широкого спектра различных факторов, помимо региональной вариации, которые влияют на использование слов и добавляют шум к сигналу. Чтобы извлечь лежащий в основе региональный сигнал из каждой карты слов, мы проводим многомерный пространственный анализ (Grieve, 2016; Grieve et al., 2011) относительных частот наших 10 000 словоформ. Чтобы выявить географические "горячие точки" в использовании каждого слова (рис. 2), мы вычисляем z-показатели Джитиса–Орда (Gi*) (Ord and Getis, 1995) для каждого округа c и слова w, которые определяются как:

Gc,w* = (Σc' Wc,c'(fc,w - fw)) / (σw √((Nc Σc' Wc,c'² - (Σc' Wc,c')²)/(Nc - 1))),

где fw — средняя частота слова w по всему набору данных, σw — стандартное отклонение частот слова w, а Wc,c' — элементы матрицы близости, которую мы принимаем равной 1, если c' = c или c' принадлежит к 10 ближайшим соседям округа c, и равной 0 в противном случае.

Метрика, заданная уравнением (1), в конечном итоге уменьшает ложную вариацию данных и сглаживает пространственные паттерны, позволяя нам различать региональный паттерн в использовании слова. На рис. 2b, d, f и h мы показываем соответственно Gi* z-показатели для предыдущих слов today, mountain, traffic и bruh. Белые, светло-голубые или светло-красные округа не отличаются существенно от среднего использования, тогда как ярко-красный или синий цвет соответственно означает, что слово относительно часто или редко используется в этом регионе. Поскольку today — довольно общее слово, мы не находим какого-либо сильного регионального паттерна, в отличие от других. "Горячие точки" использования слова mountain показывают основные горные хребты страны. В то время как карта для слова traffic коррелирует с крупными городскими районами (и может быть интерпретирована как тематическое слово), диалектное слово bruh, по-видимому, значительно чаще используется в округах, относящихся к Глубокому Югу. Мы видим здесь, что различные атрибуты, определяющие культуру (интересы, поведение, диалект), улавливаются в нашей схеме и, что примечательно, рассматриваются на равных основаниях.

Получение главных измерений региональной вариации. Распределения Gi* для всех 10 000 самых употребительных слов по использованию, таким образом, содержат ценную информацию. Однако значительную часть этой информации можно анализировать более эффективно, поскольку некоторые слова могут принадлежать к одной семантической области (mountain и peak) или характеризовать один и тот же конкретный диалект (bruh и aigh). Более того, некоторые вариации могут быть просто неинформативным шумом, присущим реальному поведению индивидов, но также потенциально являющимся результатом несовершенной фильтрации данных Twitter, как упоминалось ранее. Затем наиболее важные измерения региональной лексической вариации находятся путём подвергания карт "горячих точек" для полного набора слов анализу главных компонент (Lieske, 1993; Wold et al., 1987). Другой возможный подход мог бы состоять в выполнении тематического моделирования, например, посредством латентного размещения Дирихле на матрице частот слов, чтобы затем вывести распределение тем для каждого округа. Однако это более требовательно к вычислительным ресурсам и ставит вопросы о выборе количества тем, их интерпретируемости и внутренней согласованности (Arun et al., 2010; Hasan et al., 2021). В случае, подобном нашему, где документы столь велики (агрегируя все твиты в округе), далеко не очевидно выбрать количество тем так, чтобы между ними было мало перекрытия, и знать, что эти темы действительно репрезентативны для набора данных в целом. Это гораздо яснее при выборе компонентов в PCA, как мы покажем ниже.

Таким образом, из Nw=10 000 измерений нашего набора данных мы проецируем в пространство главных компонент (PC) размерности NPC=326. Оказывается, что эти 326 компонент объясняют 92% наблюдаемой дисперсии (см. рис. 3f). Мы не задаём это количество компонент произвольно, выбирая его напрямую или устанавливая процент дисперсии, который мы хотим объяснить с помощью этих компонент. Вместо этого мы используем правило сломанной трости для фиксации количества компонент (Frontier, 1976; Jackson, 1993). Эта эвристика сравнивает уменьшение дисперсии, объясняемой каждой последующей компонентой, с ожидаемым от случайного разделения всей дисперсии на Nw частей. Компоненты, отсортированные по убыванию объяснённой дисперсии, сохраняются до тех пор, пока они не объясняют больше дисперсии, чем их соответствующая случайная часть. С помощью этого метода мы не делаем никаких предположений о количестве дисперсии в наших данных, которое просто обусловлено случайными флуктуациями.

Мы показываем спроецированные данные по первым четырём главным компонентам на рис. 3a-d, что даёт чёткую визуализацию пространственных паттернов. Карта для каждого измерения показывает две противоположные области (красную и синюю), которые можно связать с их характерными словами — словами с наибольшей (положительной, красные) и наименьшей (отрицательной, синие) нагрузкой. Для иллюстрации, на рис. 3e мы показываем в облаке слов наиболее характерные слова для каждой из двух областей на рис. 3b, что соответствует второй компоненте. На рис. S2 и S3 мы построили соответственно спроецированные данные для матрицы близости Wc,c' из уравнения (1), определённой на основе 5 и 15 ближайших соседей. Результаты показывают, что компоненты незначительно изменяются при небольшом изменении матрицы близости. Рисунок S4 показывает результаты, когда Wc,c' определяется в терминах фиксированного расстояния. В этом случае модификации сильнее, потому что размер округов неоднороден. Это демонстрирует, что следует учитывать правильные связи соседей при работе с неоднородными географическими единицами.

Вывод культурных регионов. Теперь мы можем сгенерировать единую общую таксономию американских культурных регионов, кластеризуя вместе округа со сходными лексическими сигнатурами. Для этого мы подвергаем предыдущие карты главных компонент иерархической кластеризации, используя евклидово расстояние и алгоритм минимизации дисперсии Уорда (Everitt et al., 2011). Именно так мы определяем культурные регионы из нашего корпуса, как показано на рис. 4. На основе дендрограммы и эволюции среднего силуэтного коэффициента для разных уровней кластеризации мы выбираем осмысленное количество кластеров nclusters (Rousseeuw, 1987). Иерархический характер кластеризации полезен для того, чтобы видеть, как регионы группируются вместе на разных уровнях кластеризации, указывая, какие регионы ближе друг к другу. Важно, что применение иерархической кластеризации к главным измерениям вариации данных, полученных с помощью PCA, позволяет нам сосредоточиться на основных региональных паттернах вариации. Применение алгоритма непосредственно к матрице расстояний между 10 000 слов дало бы очень зашумлённые результаты.

Мы показываем основные разделения на рис. 4a. Это основной результат нашей статьи. На карте мы представляем разделение на пять кластеров, поскольку это один из двух лучших вариантов, охарактеризованных анализом силуэтного коэффициента на рис. 4b, и на ясном срезе дендрограммы на рис. 4d. Оптимальные выборы соответствуют двум значительным падениям коэффициента: первое (второе) соответствует числу кластеров, равному 2 (5).

Действительно, дендрограмма на рис. 4d показывает, что округа могут быть первоначально классифицированы в две крупномасштабные подгруппы, представляющие разделение Север против Юга. Затем Север далее фрагментируется на кластеры 2–4, показанные на рис. 4a, тогда как южная группа разделяется на кластеры 1 и 5. По большей части наша карта на рис. 4a согласуется со стандартными теориями американских культурных регионов, причём все пять наших регионов находят аналоги в существующих системах. Тем не менее, взятые в целом, наши кластеры не совпадают ни с одной предыдущей системой и выявляют несмежные культурные регионы, такие как кластеры 3 и 4. Более того, в отличие от предыдущих предложений, наши результаты имеют преимущество, заключающееся в том, что они управляются данными, основаны на вариации в темах, которые люди считают важным обсуждать, в отличие от факторов, выбранных вручную исследователем (и, следовательно, подверженных гораздо большему количеству неконтролируемых смещений, чем наши данные Twitter).

Кроме того, чтобы лучше интерпретировать полученные регионы, полезно знать, какие слова наиболее характерны для каждого кластера. Чтобы вывести их, мы начинаем с взятия центра каждого кластера в пространстве слов–Gi*. Таким образом, для каждого кластера мы берём средний показатель Gi* по его округам для всех слов. Из этих nclusters векторов из Nw элементов мы вычисляем минимальную абсолютную разницу между показателем слова центра каждого кластера и показателями всех других кластеров, т.е. мы берём расстояние до центра ближайшего кластера по измерению слова. Более формально, мы определяем специфичность SC,w слова w для кластера C как:

SC,w = minC' ∈ C\{C} | (1/NC) Σc∈C Gc,w* - (1/NC') Σc∈C' Gc,w* |,

где C обозначает множество кластеров, NC — количество округов, принадлежащих кластеру C, и Gc,w* — показатель Gi* слова w в округе c. Таким образом, для каждого кластера C мы определяем наиболее характерные слова как слова с наибольшими значениями SC,w. В случае разделения на пять кластеров, 5 наиболее характерных слов для каждого кластера показаны на рис. 4c, в соответствии с метрикой специфичности, определённой в уравнении (2). Во всех случаях пять культурных регионов связаны с чёткими и отличными тематическими паттернами (см. Дополнительную информацию для более исчерпывающего списка). Мы подчёркиваем, что эти характерные слова автоматически идентифицируются на основе представленного выше количественного анализа. Примечательно, что для каждого кластера мы видим три основных типа лексических паттернов.

Во-первых, мы видим слова, непосредственно связанные с этими местоположениями, чаще всего названия городов, штатов и спортивных команд. Это базовое доказательство того, что метод работает: мы ожидали бы, что эти слова будут ассоциироваться с культурными регионами, которые их содержат. Однако эти результаты также отражают то, как часто люди из разных городов и штатов упоминают друг друга. Например, пятый кластер, который сосредоточен на Техасе, также включает Оклахому, которая вносит различные топонимы в список слов, наиболее сильно ассоциирующихся с этим регионом. Это означает не только то, что люди в Техасе и Оклахоме больше говорят о топонимах в своих собственных штатах, как и следовало ожидать, но и то, что они больше говорят о топонимах в штатах друг друга. Это один из типов региональных тематических паттернов, которые использует наш подход для идентификации культурных регионов.

Во-вторых, мы наблюдаем слова, связанные с нерегиональными темами, которые, тем не менее, показывают региональные различия. В этом случае наш подход можно рассматривать как обнаружение тематических паттернов и, как следствие, культурных паттернов, которые различают разные регионы США. Например, кластер 2 сильно ассоциируется с обсуждением ряда американских видов спорта, а также названий штатов, входящих в этот регион. Хотя мы ожидали бы, что регион, сосредоточенный вокруг Среднего Запада, будет ассоциироваться с названиями штатов Среднего Запада, их озабоченность обсуждением спорта в Twitter не так легко предсказать.

В-третьих, мы находим слова, которые являются диалектными единицами, т.е. альтернативными способами обозначения данного понятия. Этот тип паттерна особенно очевиден для кластера 1, который тесно совпадает с регионом плотности афроамериканского населения и поэтому ассоциируется с многочисленными лексическими единицами из афроамериканского английского (например, bruh, lawd, turni). Хотя диалектологи обычно не сосредотачиваются на частотах отдельных слов, этот результат ожидаем: диалектные регионы, которые можно рассматривать как тип культурного региона, как было обнаружено, обычно совпадают с более широкими культурными регионами (Grieve, 2016).

Теперь мы можем рассмотреть каждый из пяти выявленных нами культурных регионов по очереди и подумать о том, что слова, наиболее сильно ассоциирующиеся с каждым из них, говорят нам о культуре этого региона, а также о факторах, которые в более общем плане движут культурной вариацией в США.

Первый кластер [синий на рис. 4a], который идентифицирует юго-восточный регион, во многом отражает афроамериканскую культуру, что можно предсказать на основе тесной корреляции между нашей картой и распределением округов с относительно большим афроамериканским населением (см. рис. S1). Наиболее заметно, что твиты с Юга с большей вероятностью содержат слова, связанные с афроамериканской культурой, включая, например, кухню (например, grits, cookout), моду (например, braids, dreads) и музыку (например, rappers, rapping). Как отмечалось выше, этот кластер также сильно характеризуется множеством лексических единиц, связанных с афроамериканским английским, особенно для обозначения людей (например, bruh, dawe), а также множеством акронимов (например, fitt, stg). Топонимы, наиболее сильно ассоциирующиеся с этим кластером, в основном включают южные штаты (например, Georgia, Carolina), несмотря на то, что в целом ссылки на топонимы относительно редки по сравнению с другими кластерам.

Второй кластер [жёлтый на рис. 4a] имеет своё ядро на Среднем Западе и явно характеризуется более частыми упоминаниями спорта. Особенно выделяются американские командные виды спорта: 40 слов из 50 наиболее сильно ассоциирующихся с этим кластером слов напрямую связаны с этой темой. В частности, это слова, связанные с баскетболом (например, basketball, rebound) и бейсболом (например, baseball, innings), хотя также упоминаются футбол, борьба и черлидинг, а также различные более общие спортивные термины (например, teams, tourney). Аналогично, многие топонимы ассоциируются с местными спортивными командами (например, Cubs, Chiefs), хотя различные названия штатов также сильно ассоциируются с этим кластером (например, Ohio, Illinois), как и само слово Midwest. Меньшее количество лексических единиц также ассоциируется со школой (например, locker, choir). В целом, этот кластер, таким образом, показывает, что спорт является центральной частью этого региона.

Третий кластер [зелёный на рис. 4a] можно идентифицировать с несмежным регионом, который в основном совпадает с сельскими районами США, а также районами, ориентированными на активный отдых на открытом воздухе, особенно в горных регионах (например, Скалистые или Аппалачские горы). Этот кластер относительно трудно интерпретировать тематически, отчасти потому, что, в отличие от других регионов, он характеризуется относительно нечастым использованием ряда слов. С точки зрения слов, которые относительно распространены в этом регионе, наиболее чётким паттерном является относительно большое количество слов, связанных с природой (например, mountains, tree), погодой (например, snow, seasonal) и активным отдыхом на открытом воздухе (например, adventures, trail). Очевидно, что люди в этом регионе склонны больше сосредотачиваться на своём естественном окружении. Кроме того, есть ряд слов, связанных с работой (например, hiring, jobs), а также многочисленные топонимы (например, Colorado, Montana), которые сильно ассоциируются с этим регионом. С точки зрения слов, которые необычны внутри кластера, существует много глаголов, особенно глаголов, связанных с человеческими действиями, такими как общение (например, said, told), мыслительные процессы (например, understand, confused) и физические действия (например, put, hit), что подразумевает в целом меньшее внимание к индивиду. Этот регион также ассоциируется с относительно нечастым использованием широкого спектра негативных слов (например, wrong, bad), что в значительной степени намекает на более позитивный взгляд.

Четвёртый кластер [красный на рис. 4a] также идентифицирует несмежный регион, который в основном охватывает крупные городские районы на побережьях (Северо-Восток и Запад). Неудивительно, что этот регион характеризуется широким спектром слов, связанных с более городской жизнью (например, homeless, traffic), особенно терминами, связанными с различными национальностями и иммиграцией (например, Latino, Asian). Мы также находим относительно большое количество топонимов (например, California, NYC). Поразительно, что этот кластер ассоциируется с очень большим количеством слов с негативной коннотацией, включая слова, связанные с насилием (например, violence, attack), опасностью (например, dangerous, crime), ругательствами (например, asshole, fucking), политическими беспорядками (например, protests, indicted), расизмом (например, Nazi, supremacist) и общими негативными прилагательными (например, disgusting, abusive). В общем, люди из этого кластера с большей вероятностью обсуждают негативные темы, чем другие части США, по крайней мере, в социальных сетях. Вместе взятые, третий и четвёртый кластеры предполагают противопоставление в культуре более сельских и городских районов США, которые, по-видимому, ведут соответственно более позитивный и негативный дискурс (Vanderbeck and Dunkley, 2003).

Наконец, пятый кластер [голубой на рис. 4a], который сосредоточен вокруг южно-центральных штатов, особенно Техаса и Оклахомы, характеризуется частым упоминанием топонимов по сравнению с другими кластерами, особенно в этих двух штатах, как уже отмечалось. Например, первые пять наиболее сильно ассоциирующихся слов — это Whataburger (сеть фастфуда из Техаса), за которым следуют Texas, TX, Texan и Dallas. Это не только показывает, что люди в этом регионе склонны больше обсуждать места в Twitter, но и подразумевает, что для этого культурного региона характерно относительно высокое количество местной гордости. Соответственно, этот регион также ассоциируется с относительно большим количеством диалектных терминов как англосаксонского (например, yalls, fixing), так и испанского (например, queen, taco) происхождения, отражая разнообразный состав этого региона.

Анализ, приведший к рис. 4, был повторён с добавлением шага стемминга в самом начале нашего конвейера. Мы получаем очень похожий результат, показанный на рис. S5, что указывает на небольшую чувствительность наших результатов к стеммингу.

Учитывая отсутствие консенсуса в предыдущих исследованиях, наши результаты могут помочь разрешить давние дебаты, касающиеся распределения американских культурных регионов. Мы обнаруживаем, что разделение между Юго-Востоком и остальной частью США является самым сильным. Этот результат свидетельствует о важности культурного разрыва между Белой и Чёрной Америкой и между Севером и Югом. Хотя все предыдущие основные теории американских культурных регионов идентифицировали различие между Севером и Югом, наш южный регион особенно похож на относительно недавние теории, которые идентифицируют южный регион, тесно совпадающий с частью юга с особенно высокой долей афроамериканцев (Lieske, 1993; Woodard, 2012). Ещё одним ключевым открытием, вытекающим из нашего анализа, является широкое противопоставление между прибрежными и внутренними районами, которое ранее не идентифицировалось как важный источник различия американских культурных регионов (Elazar, 1970; Fischer, 1989; Garreau, 1996; Gastil, 1975; Lieske, 1993; Odum, 1936; Woodard, 2012; Zelinsky, 1973), но отражает современную политическую тенденцию неоспоримой значимости (Gelman, 2009), которая в настоящее время переконфигурирует нацию. Несмежный характер этих регионов, который не требуется нашим определением культурного региона, также примечателен. Он демонстрирует, как паттерны в американской культуре могут быть распределены по очень обширным территориям, отражая сложные паттерны в физической и человеческой географии, а также лежащую в основе сложность и динамичную природу американского общества. Этот результат в целом согласуется с другими недавними теориями американских культурных регионов, которые также идентифицировали несмежные культурные регионы (Lieske, 1993; Woodard, 2012).

Наш анализ также полезен для понимания отношений между этими регионами. Он разделяет Юг на два региона, отделяя Техас от остальной части Юго-Востока, и отделяет Средний Запад от остальной части Севера, разделяя его на несмежные сельские/прибрежные регионы, а не на смежные культурные регионы. Однако по вопросу о количестве первичных американских культурных регионов мы можем лишь с уверенностью сказать, что с нашими данными и методологией можно различить как минимум пять различных регионов. Мы не видим этого здесь, но мы всё ещё не можем отвергнуть недавние теории, утверждающие, что Америка в корне гораздо более культурно фрагментирована (Garreau, 1996; Lieske, 1993; Woodard, 2012).

Временной аспект результатов. Учитывая успех нашего анализа, было бы интересно посмотреть, как культурные регионы, найденные на рис. 4, меняются со временем, как это делалось в других исследованиях, анализирующих диахронические корпуса (Alshaabi et al., 2021; Bentley et al., 2014; Bochkarev et al., 2015; Karjus et al., 2020; Momeni et al., 2018). Хотя мы не ожидаем значительных изменений из-за короткого временного масштаба, наложенного нашим набором данных Twitter, мы всё ещё можем провести диахроническое исследование, чтобы подтвердить само существование и осмысленность культурных регионов. Для этого мы разделили наш корпус на три набора данных, соответствующих разным диапазонам лет: 2015–2016, 2017–2018 и 2019–2021. Эти периоды имеют схожее количество токенов и могут быть подвергнуты сравнению (см. Дополнительную таблицу 1). Мы показываем их карты на рис. 5a–c. Мы получаем схожие паттерны, несмотря на разнообразие тем и форм, используемых в Twitter за эти годы, и эвристическую природу метода кластеризации, который вносит небольшое количество шума в результаты. Разделение Север-Юг стабильно во времени с небольшими вариациями, которые могут быть обусловлены либо флуктуациями, либо зарождающимися структурными изменениями. Последние не могут быть окончательными из-за короткого периода времени, рассматриваемого в этой работе.

Затем мы берём иерархическую кластеризацию на рис. 4d и выбираем назначение округов кластерам, соответствующее наивысшему уровню иерархии. Это представлено двусторонним разделением между Севером и Югом. Для каждого года в нашем наборе данных мы затем измеряем попарные расстояния между округами, принадлежащими обоим кластерам. Расстояния рассчитываются как евклидовы расстояния между строками матрицы Gc,w* (см. уравнение (1)). Таким образом, мы получаем эволюцию распределения межкластерных расстояний со временем, как показано на рис. 5d. Боксплоты демонстрируют, что (i) медианное расстояние примерно постоянно на протяжении лет, и (ii) распределение расстояний показывает небольшую вариацию. Оба вывода предполагают, что обнаруженные культурные регионы не являются артефактом метода, но представляют собой подлинную структуру данных, существующую в нашем корпусе.

Обсуждение

В целом, наш анализ, таким образом, выявил региональные паттерны лексической вариации, имеющие явное культурное значение. Более того, темы, связанные с каждым из этих паттернов, дают новую перспективу на американскую культурную географию. Например, хотя наш анализ подтвердил, что такие факторы, как этническая принадлежность и религия, важны для определения американских культурных регионов, мы обнаружили существенные вариации в релевантности этих факторов по территории США. Наш анализ также выявил другие более тонкие культурные паттерны — такие как акцент на социальном взаимодействии, активном отдыхе на открытом воздухе, семье и досуге — которые упускались из виду в предыдущих исследованиях, отчасти потому, что их нельзя легко изучить с помощью анализа традиционных источников вторичных данных. Таким образом, наш метод не только позволил нам картировать культурные регионы, но и позволил нам идентифицировать культурные факторы, важные для определения этих регионов, по крайней мере, в этом коммуникативном контексте, обеспечивая основу для более полной картины американского культурного ландшафта.

Очевидно, что наше исследование проанализировало только один жанр американского английского. Конкретные тематические паттерны в Twitter не будут точно воспроизведены в других жанрах, особенно учитывая коммуникативную цель и пользовательскую базу, связанные с платформами микроблогов. Тем не менее, предполагая, что американские культурные регионы являются важными и всепроникающими силами, схожие региональные паттерны должны отражаться во всех жанрах. Этот вопрос может быть дополнительно прояснен, когда в ближайшем будущем станут доступны более богато аннотированные данные естественного языка. Однако наши методы останутся действительными для любого такого набора данных. Ключевым моментом является то, что мы ожидаем, что наша основная идея вывода культурных регионов и тем, их определяющих, из речи людей будет применима к любому ресурсу больших данных с лингвистической ценностью.

Доступность данных

Все агрегированные данные, сгенерированные нашими анализами данных Twitter, а также наш список исключённых слов доступны для загрузки из репозитория figshare (Louf, 2023a). Файлы форм границ округов и штатов из переписи населения США 2018 года, которые мы использовали для рисования наших карт, свободно доступны для загрузки по адресу https://www.census.gov/geographies/mapping-files/2018/geo/carto-boundary-file.html.

Доступность кода

Обработка данных и построение графиков результатов были выполнены на Python с помощью библиотек с открытым исходным кодом. Весь код, использованный для этой работы, размещён на GitHub (Louf, 2023b).

Получено: 15 августа 2022; Принято: 6 марта 2023; Опубликовано онлайн: 30 марта 2023

Ссылки

Abitbol JL, Karsai M, Magué JP, Chevrot JP, Fleury E (2018) Socioeconomic dependencies of linguistic patterns in Twitter: a multivariate analysis. In: The Web conference 2018—Proceedings of the world wide web conference, WWW 2018. pp. International World Wide Web Conferences Steering Committee, 1125–1134

Al-Rfou R, Solomon B (2014) Python bindings for the compact language detector 2. https://github.com/abosamoor/pycld2

Alshaabi T et al. (2021) Storywrangler: a massive exploration for sociolinguistic, cultural, socioeconomic, and political timelines using Twitter. Sci Adv 7:eabe6534. https://doi.org/10.1126/sciadv.abe6534

Arun R, Suresh V, Veril Madhavan CE, Narasimha Murthy MN (2010) On finding the natural number of topics with latent Dirichlet allocations: some observations. In: Proceedings of the 14th Pacific-Asia conference on advances in knowledge discovery and data mining—volume Part I, PAKDD’10. Springer-Verlag, Berlin, Heidelberg. pp. 391–402

Auxier B, Anderson M (2021) Social media use in 2021. Technical Report, Pew Research Center. https://www.pewresearch.org/internet/2021/04/07/social-media-use-in-2021/

Bentley RA, Acerbi A, Ormerod P, Lampos V (2014) Books average previous decade of economic misery. PLoS ONE 9:e83147. https://doi.org/10.1371/journal.pone.0083147

Bochkarev VV, Shevjakova AV, Solovyev VD (2015) The average word length dynamics as an indicator of cultural changes in society. Soc Evol Hist 14:153–175

Brock JOM, Webb JW, Hsu M-L (1973) A geography of mankind. McGraw-Hill, New York

Diaz F, Gamon M, Hofman JM, Keuman E, Rothschild D (2016) Online and social media data as an imperfect continuous panel survey. PLoS ONE 11:e0145406

Donoso G, Sánchez D (2017) Dialectometric analysis of language variation in Twitter. In: Proceedings of the fourth workshop on NLP for similar languages, Varieties and Dialects (VarDial), Association for Computational Linguistics (ACL), pp. 16–25

Eisenstein J, O'Connor B, Smith NA, Xing EP (2014) Diffusion of lexical change in social media. PLoS ONE 9:e113114. https://doi.org/10.1371/journal.pone.0113114

Elazar DJ (1970) Cities of the Prairie: the metropolitan frontier and American politics. Basic Books, New York

Everitt RS, Landau S, Leese M, Stahl D (2011) Cluster analysis. John Wiley & Sons, Wiley, Chichester, UK

Fischer DH (1989) Albion's seed. Oxford University Press, Oxford, UK

Frontier S (1976) Étude de la décroissance des valeurs propres dans une analyse en composantes principales: Comparaison avec le modèle du bâton brisé. J Exp Mar Biol Ecol 25:67–75

Funkner AA et al. (2021) Geographical topic modelling on spatial social network data. Procedia Comput Sci 193:22–31. https://www.sciencedirect.com/science/article/pii/S1877050921022445

Garreau J (1996) The Nine Nations of North America. Houghton Mifflin Company, Boston

Gastil RD (1975) Cultural Regions of the United States. University of Washington Press, Seattle

Gelman A (2009) Red state, blue state, rich state, poor state: why Americans vote the way they do. Princeton University Press, Princeton

Gonçalves B, Loureiro-Porto L, Ramasco JJ, Sánchez D (2018) Mapping the americanization of English in space and time. PLoS ONE 13:e0197741. https://doi.org/10.1371/journal.pone.0197741

Gonçalves B, Sánchez D (2014) Crowdsourcing dialect characterization through Twitter. PLoS ONE 9:e112074. https://doi.org/10.1371/journal.pone.0112074

Grieve J (2016) Regional variation in written American English. Cambridge University Press

Grieve J, Montgomery C, Nini A, Murakami A, Guo D (2019) Mapping lexical dialect variation in British English using Twitter. Front Artif Intell 2:11. https://doi.org/10.3389/frai.2019.00011/full

Grieve J, Speelman D, Geeraerts D (2011) A statistical method for the identification and aggregation of regional linguistic variation. Language Variation and Change 23:193–221

Hasan M, Rahman A, Karim MR, Khan MSI, Islam MJ (2021) Normalized approach to find optimal number of topics in Latent Dirichlet Allocation (LDA). In: Kaiser MS, Bandyopadhyay A, Mahmud M, Ray K (eds) Proceedings of international conference on trends in computational and cognitive engineering, advances in intelligent systems and computing. Springer, Singapore. pp. 341–354

Huang Y, Guo D, Kasakoff A, Grieve J (2016) Understanding U.S. regional linguistic variation with Twitter data analysis. Comput Environ Urban Syst 59:244–255. https://doi.org/10.1016/j.compenvurbsys.2015.12.003

Jackson DA (1993) Stopping rules in principal components analysis: a comparison of heuristical and statistical approaches. Ecology 74:2204–2214

Karjus A, Blythe RA, Kirby S, Smith K (2020) Quantifying the dynamics of topical fluctuations in language. Language Dynamics and Change 10:86–125. https://brill.com/view/journals/ldc/10/1/article-p86_5.xml

Koylu C (2018) Uncovering two social semantics from the Twitter Mention Network: an integrated approach using spatial network smoothing and topic modeling. In: Shaw S-L, Sui D (eds) Human dynamics research in smart and connected communities, human dynamics in smart cities. Springer International Publishing, Cham, pp. 163–179

Kramsch C (2014) Language and culture. AILA Review 27:30–55

Lane J-E, Ersson S (2016) Culture and politics: a comparative approach, 2nd edn. Routledge, London

Lieske J (1993) Regional subcultures of the united states. J Politics 55:888–913. https://doi.org/10.2307/2131941

Louf T (2023a) Word counts per US county in geo-tagged Tweets posted between 2015 and 2021. https://figshare.com/articles/dataset/Word_counts_per_US_county_in_geo-tagged_Tweets_posted_between_2015_and_2021/20630919

Louf T (2023b) Words-use. https://github.com/TLouf/words-use

Mislove A, Lehmann S, Ahn Y-Y, Onnela J-P, Rosenquist IN (2011) Understanding the demographics of Twitter users. In: Proceedings of the international AAAI conference on web and social media, vol 5. AAAI Press, Barcelona, pp. 554–557

Momeni E, Karunasekera S, Goyal P, Lerman K (2018) Modeling evolution of topics in large-scale temporal text corpora. In: Proceedings of the 12th international AAAI conference on web and social media. Association for the Advancement of Artificial Intelligence, pp. 656–659

Nguyen D, Dogruoz AS, Rose CP, de Jong F (2016) Computational sociolinguistics: a survey. Comput Linguist 42:537–593. https://doi.org/10.1162/COLI_a_00258

Odum HW (1936) Southern regions of the United States. University of North Carolina Press, Chapel Hill, NC

Ord JK, Getis A (1995) Local spatial autocorrelation statistics: distributional issues and an application. Geogr Anal 27, 286–306

Pavalanathan U, Eisenstein J (2015) Continuous and consequences in geotagged Twitter data. In: Proceedings of the 2015 conference on empirical methods in natural language processing. Association for Computational Linguistics (ACL), Lisbon, pp. 2138–2148

Rousseeuw PJ (1987) Silhouettes: a graphical aid to the interpretation and validation of cluster analysis. J Comput Appl Math 20:53–65

Steiger E, De Albuquerque JP, Zipf A (2015) An advanced systematic literature review on spatiotemporal analyses of Twitter data. Trans GIS 19:809–834

Vanderbeck RM, Dunkley CM (2003) Young people’s narratives of rural–urban differences. Child Geogr 1:241–259

Wold S, Esbensen K, Geladi P (1987) Principal component analysis. Chemometr Intell Lab Syst 2:37–52

Woodard C (2012) American Nations: a history of the eleven rival regional cultures of North America. Penguin Books, New York, NY

Zelinsky W (1973) The cultural geography of the United States. Prentice-Hall, Englewood Cliffs, 1st. ed

Вклад авторов

Все авторы разработали исследование и выполнили анализ данных. TL построил корпус и написал код, который произвёл результаты. JG и TL составили первоначальный вариант рукописи, и все авторы участвовали в последующих редакциях. JJR, DS и JG обеспечили финансирование.

Конкурирующие интересы

Авторы заявляют об отсутствии конкурирующих интересов.

Этическое одобрение

Эта статья не содержит каких-либо исследований с участием людей, выполненных кем-либо из авторов.

Информированное согласие

Эта статья не содержит каких-либо исследований с участием людей, выполненных кем-либо из авторов.

Дополнительная информация

Дополнительная информация Онлайн-версия содержит дополнительный материал, доступный по адресу https://doi.org/10.1057/s41599-023-01611-3.

Корреспонденция и запросы на материалы следует направлять Томасу Луфу или Давиду Санчесу.

Перепечатки и информация о разрешениях доступны по адресу http://www.nature.com/reprints

Заявление издателя Springer Nature сохраняет нейтралитет в отношении юрисдикционных претензий на опубликованных картах и институциональной принадлежности.

Открытый доступ Эта статья лицензирована в соответствии с Creative Commons Attribution 4.0 International License, что разрешает использование, обмен, адаптацию, распространение и воспроизведение на любом носителе и в любом формате при условии надлежащего указания авторства оригинального автора(ов) и источника, предоставления ссылки на лицензию Creative Commons и указания, были ли внесены изменения. Изображения или другой материал третьих лиц в этой статье включены в лицензию Creative Commons статьи, если не указано иное в кредитной линии к материалу. Если материал не включён в лицензию Creative Commons статьи и ваше предполагаемое использование не разрешено законодательством или превышает разрешённое использование, вам необходимо получить разрешение непосредственно от правообладателя. Чтобы просмотреть копию этой лицензии, посетите http://creativecommons.org/licenses/by/4.0/.

© Автор(ы) 2023

Благодарности

Эта работа была частично поддержана Испанским государственным агентством исследований (MCIN/AEI/10.13039/501100011033) и ФЕДЕР (EU) в рамках проекта APASOS (PID2021-122256NB-C21 и PID2021-122256NB-C22) и проекта Maria de Maeztu CEX2021-001164-M, Автономным сообществом Балеарских островов через Direcció General de Política Universitària i Recerca со средствами из Закона о туристическом налоге ITS 2017-006 (PDR2020/51), а также Советом по исследованиям в области искусств и гуманитарных наук (Великобритания), Советом по экономическим и социальным исследованиям (Великобритания), Jisc (Великобритания) (грант Jisc, номер ссылки 3134) и Институтом музейных и библиотечных услуг (США) в рамках конкурса Digging into Data (Раунд 3).